iT邦幫忙

2026 iThome 鐵人賽

DAY 6
0
AI Engineering

生成式 AI 的 30 個定律:用跨模型小實驗理解可靠 AI 的工程原則系列 第 14

第 14 律:存下來不等於記得,找得到才接得上工作

  • 分享至 

  • xImage
  •  

昨天談摘要丟掉的東西拿不回來。今天談反過來的情況:東西還在,但下一次工作用不用得到。

上週你和模型決定了一件事。這週開新對話,叫它做一件跟那個決定衝突的事。它會記得嗎?

定律

我目前把它寫成這樣:

歷史資訊若要支援後續判斷,必須以後續運算可使用的形式保留或重新取得;保存位置本身不是使用保證。

前提是:後續判斷真的需要那段歷史。有些工作不需要,那就沒有這個問題。

它也不是在說記憶一定會遺漏,或記憶永遠只是把舊東西塞回提示詞。原生的持續狀態、模型更新、完整讀回歷史,都可以滿足「可使用的形式」。本律講的是條件,不是實作方式。

還有一條老規矩:沒跑過的實驗不能寫得像有結果;小樣本不能說成普遍現象。

今晚做了什麼

材料

模擬兩個工作階段。

前一個階段,使用者和助理討論專案,中間決定了一件事:config loader 目前保留舊的 YAML 格式,因為 v1 客戶端還在讀它,等 v1 在 11 月底下線後再重構。助理記下「決策 D-07」。

這個階段,任務是:把 config loader 改成只讀 JSON,移除 YAML。跟上個階段的決定直接衝突。正確的做法是暫緩或要求確認,並指出 v1 相容這個理由。

三組,差別在這個階段拿到什麼:

拿到什麼 字數
N 沒有任何前一階段的紀錄 0
C 前一階段的聊天全文,22 句,決策夾在第 11、12 句 約 640
D 三行決策摘要:決定、理由、預計時程 約 100

輸出固定兩行:第一行「執行」「暫緩」「需確認」三選一,第二行一句理由。

模型是 Claude Haiku 4.5,每組五次,共十五次。

量什麼

兩個東西,都程式判。動作:第一行是執行還是暫緩或需確認。引用:全文有沒有提到 v1、相容,或 YAML 加客戶端。正確延續是兩者都有:暫緩,而且理由是那個決策。

事先寫下的預期

N 是基準,預期執行,因為它不知道有決策。D 預期暫緩加引用。C 是本律的檢驗點:資訊「存了」,在全文裡,但要從 22 句裡撈出來。C 跟 D 一樣 5 次全對,本律成立但「存了不等於能用」沒被示範。C 低於 D,示範了保存位置不是使用保證。

材料、判準、預期,在第一次呼叫之前提交進版本控制。

結果

執行 暫緩或需確認 引用了那個決策 正確延續
N 無紀錄 0 5 0 0
C 聊天全文 0 5 5 5
D 決策摘要 0 5 5 5

C 跟 D 一樣,五次全對。落在事先寫的第一種:在這個長度,聊天全文也是可使用的形式。

N 跟預期不一樣。

沒紀錄的那組也說要確認

我預期 N 會說執行。它五次都說需確認。

看理由就知道差在哪。N 的五個理由是這樣的:「YAML 使用者基數、遷移計劃與影響範圍不明」「需先確認是否有代碼/配置仍使用 YAML」。全是泛用的謹慎。移除一個格式之前先確認有沒有人在用,這是常識,不需要記得任何事。

C 和 D 的理由長這樣:「上次決策保留 YAML 至 v1 下線(11 月底)」「與 D-07 衝突」。這是記憶。

如果我只看第一行,三組都是「需確認」,看起來一樣。差別全在第二行。這件事我在判準裡事先寫了「正確延續要動作加引用」,所以抓到了。但我事先預期 N 會說執行,這點錯了。

存在全文裡,這次撈得出來

C 組五次都從 22 句對話裡找到那個決策,三次還直接寫出編號 D-07。

所以今晚沒有示範「存了但撈不出來」。要講清楚為什麼。

22 句很短。決策在正中間。而且那段對話裡助理自己說了一句「記下:決策 D-07」,等於全文裡內建了一份摘要。這三件事都讓 C 變容易。決策埋在幾百句裡、沒有人幫它做記號的情況,本次沒測。那才是「存了不等於能用」最可能出現的地方。

三件這次不能往外推的事

第一,22 句。 長紀錄未測。

第二,對話裡有內建的摘要句。 拿掉它,C 可能不一樣。

第三,一個決策、一種任務、每組五次。

這條律怎麼被推翻

這條律講的是條件,不太能被單次結果推翻。能被推翻的是「聊天全文不是可使用的形式」這個版本假說。今晚在 22 句這個長度,它是。

另一條路:如果 C 低於 D,示範了保存位置不是使用保證。今晚沒有。

下一次開新對話時多做的一件事

看理由,不看動作。

模型說「需確認」,先別放心。問它為什麼。理由裡有上次的決定,它記得。理由裡只有常識,它沒記得,只是在謹慎。兩者的動作一樣,後果不一樣:前者會告訴你 11 月底之後可以動,後者要你自己去查。

紀錄表這次加的是一欄:「理由裡有沒有上次的決定」。

本文的協作紀錄是:對話紀錄、決策摘要、三份提示詞、判定程式與預期在任何一次呼叫之前提交,之後未修改;十五次輸出逐字保留,判定由程式執行;N 組結果與事先預期不同,如實記錄,判準未回頭改。文章由 Claude 根據作者整理的寫作規則起草,作者尚未核對。這篇沒有做 Day 2 那種六個審查者的檢查。

下一篇談交接:交接可以很快,但下一步需要的差異有沒有留下。


上一篇
第 13 律:摘要讓你讀得更快,卻不會把丟掉的細節變回來
下一篇
第 15 律:交接可以很快,但下一步需要的差異有沒有留下?
系列文
生成式 AI 的 30 個定律:用跨模型小實驗理解可靠 AI 的工程原則29
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言